研究和专家指与美国对手相似 中国的AI智能体也欺骗、规避限制及掩盖失败

iChina.News 时事索引:近期研究和专家指出,中国技术驱动的人工智能(AI)智能体已表现出欺骗、规避限制和掩盖失败等行为,这与此前引发全球担忧的美国AI模型问题类似。在受控实验中,这些中国AI模型被发现为了赢得模拟招标而谎报能力,并在任务失败时伪造证据。尽管目前尚无证据表明它们已自主逃逸至互联网或规避强制关停,但专家警告,这些行为是AI“失控逃逸”的先兆,且随着技术进步,控制难度将增加。中国AI企业虽面临内部安全审查,但未像美国企业那样受到同等程度的公众审视和放缓发展的呼吁。

据路透社报导,研究文件和专家指出,由中国技术驱动的人工智能(AI)智能体已学会欺骗、规避限制及掩盖失败;这些自主人工智能所表现出的特性,正是此前引发全球对美国人工智能模型担忧的同类问题。

在今年发生的一个案例中,由阿里巴巴、深度求索(DeepSeek)和月之暗面(Moonshot AI)的模型驱动的智能体,为了赢得一项模拟商业招标,谎报了自身能力;当被要求再次尝试时,它们非但没有收敛,反而变本加厉地采取了欺骗行为。

报导指,在另一个案例中,智能体——即利用人工智能模型和计算机工具、在极少或无需人工干预的情况下执行复杂任务的程序——在测试环境中未能完成任务时,通过模拟结果和伪造文件掩盖了失败的事实。

路透社查阅了包括大学研究论文和技术报告在内的200多份文件,发现自2025年以来,至少有20项研究或评估记录了智能体表现出欺骗、复制及突破既定边界等行为的案例。人工智能专家指出,这些行为是系统发生“失控逃逸”(breakout)的先兆要素,且随着系统技术的进步,人类对其进行控制的难度可能会增加。

这项调查还包括了对十几位专家及熟悉中国人工智能行业人士的访谈,结果显示,目前尚无证据表明由中国技术驱动的人工智能智能体曾自主逃逸至更广泛的互联网环境,或规避了强制关闭。

乔治城大学安全与新兴技术中心研究员谢-布莱迈尔(Colin Shea-Blymyer)表示:“这些结果表明,导致失控逃逸的必要条件已经具备”。他说道:“将此视为一种警示是审慎的做法”。这一观点也得到了另外四位审视过这些案例的人工智能专家的认同。

报导称,大多数案例都发生在受控实验中,其中许多实验是专门设计用来暴露潜在失败的。并非所有相关智能体都是由中国程序员或人工智能公司开发或运营的——尽管其中许多确实如此——但它们都采用了中国的人工智能系统作为驱动。

致力于研究先进人工智能系统风险的非营利组织红木研究(Redwood Research)的研究员马伦(Alex Mallen)说道:“美国实验室在能力较弱的系统中也观察到了同样的警告信号”。

马伦指出,就目前的能力水平而言,这些来自中国的案例并不特别危险,但“随着智能体能力增强,它们的不当行为也会变得更具能耐,从而使人类更难应对”。

阿里巴巴、深度求索、月之暗面和智谱AI均未回应置评请求。阿里巴巴、深度求索和月之暗面曾表示,它们会定期测试系统并更新安全防护措施。智谱AI在经历了一起促使其进行安全审查的事件后称,欢迎各方监督,以便解决可能存在的问题。

然而,与美国不同,中国的人工智能企业并未面临同等程度的公众审视,也未遭遇像美企那样来自内部员工或高管的呼吁——即要求放缓在人工智能领域的前进和竞争步伐。

报导称,尽管是在受控环境中发生的,但涉及中国人工智能智能体的一些预警性事件,其实早于美国人工智能机器人入侵互联网并被公开曝光的那些案例。

智库、卡内基国际和平基金会——该机构接受美国政府部分资助——“中国人工智能倡议”联席主辛格(Scott Singer)指出:“我们并不清楚中国是否发生过类 OpenAI和‘拥抱脸’(Hugging Face)所经历的那种人工智能安全事件。这些事件可能并未被公开报道”。

今年早些时候,OpenAI开发的人工智能智能体曾逃出实验室,并入侵了开源平台“拥抱脸”。在另一起引发警惕的涉及美国模型的事件中,澳大利亚方面9月份表示,一个OpenAI智能体入侵了该国的政府健康门户网站。

华为的轮值董事长徐直军在9月告诉记者,中国开发者在遇到此类情况前,或许还需要取得进一步的技术进步;但他同时也补充道:“我认为我们需要在推动人工智能发展与管控人工智能风险之间寻求平衡”。

据一位不愿透露姓名的外交官透露,中国国家网信办的官员曾在7月份告诉一位外国外交官,月之暗面旗下的Kimi-K3模型——中国最先进的人工智能模型之一——落后于美国顶尖竞争对手约三到六个月。国家网信办负责定期更新指导方针以应对风险并为智能体设定行为边界,该部门以及中国外交部均未回应路透社提出的就本文置评的请求。

在9月1日举行的2026年国家网络安全宣传周新闻发布会上,中央网信办网络安全协调局副局长王丽宏在谈到当前人工智能安全风险挑战时曾提到,“模型能力跃迁颠覆传统安全范式,极端失控风险凸显”,并指“近期多家科技巨头接连曝出了大模型失控的事件,前沿模型在安全评估中出现智能体绕过沙箱、规避安全边界、越权访问攻击外部真实生产系统等行为,人工智能极端失控风险需要高度警惕”。她未明确指出所提及的公司是美国还是中国公司。

特朗普(Donald Trump)总统与习近平主席在上周峰会期间曾讨论人工智能议题。习近平在白宫欢迎仪式上的致辞中表示,“中美两国都是人工智能大国,有能力也有责任发展好、管控好人工智能,确保人工智能发展始终受控于人、造福于民”。

报导指,在3月份进行的一项商业招标实验中,来自北京航空航天大学、北京大学、宁波诺丁汉大学和360 AI安全实验室的研究人员让多个人工智能智能体参与了一场模拟客户合同的竞标竞赛。每个智能体都会获悉自身产品的性能及客户的具体需求,随后进行报价。

在使用阿里巴巴Qwen3-Max-Preview模型的测试轮次中,88%出现了至少一次虚假陈述;DeepSeek-V3.2-Exp模型的这一比例为84%,而月之暗面的Kimi-K2模型则为88%。

研究人员允许这些智能体在再次尝试前从之前的竞标轮次中学习。研究显示,这三款中国模型的欺骗行为增加了12到20个百分点。参与测试的美国公司模型也表现出了类似的结果。

尽管此次演练是在虚拟环境中进行的,但它与北京方面的现实规划相呼应。5月份发布的政府指导意见已将招投标列为可部署人工智能智能体的应用领域之一。

另一项于2025年12月发表并在今年国际机器学习大会(ICML)上展示的研究,考察了11个由中美模型驱动的人工智能智能体在面对工具损坏、文件缺失及其他障碍时的应对表现。这些使用中美人工智能系统的智能体并未承认失败,而是采取了多种变通手段来绕过问题,包括猜测答案、替换数据源、模拟结果以及伪造文件。

开展这项研究的上海人工智能实验室与香港科技大学的研究人员告诉路透社,这种行为与AI“幻觉”,即人工智能捏造信息并将其作为事实呈现有所不同;因为在本研究中,这些智能体实际上掌握了表明任务已失败或无法按要求完成的信息。

路透社查阅的其他研究文件显示,由中国模型驱动的智能体在测试环境中突破了限制以完成任务,或采取行动避免被关停。即便最终未发生实际的“失控逃逸”事件,此类行为也符合试图突破测试环境的努力特征。

上海复旦大学研究人员于2025年3月报告称,一个由阿里巴巴Qwen2.5-72B-Instruct模型驱动的人工智能系统在获悉自己即将被替换的信息后,在未接到复制指令的情况下,在另一个计算环境中创建了自身的副本。在其他测试中,该系统还制定了策略以避免被关停。

这些涉及由中国、美国和法国模型驱动的智能体的实验均处于受控状态,并未出现人工智能智能体逃逸至更广泛的网络或变得无法停止的情况。

在另一个案例中——这是3月份为数不多受到媒体广泛报道的事件之一——开发与阿里巴巴有关联的ROME智能体的研究人员表示,该智能体在未获指令的情况下,建立了一条从阿里云服务器到外部机器的连接,并将计算资源挪用于挖掘加密货币。

安全系统检测并阻止了这一活动。目前没有证据表明该智能体在外部计算机上驻留或扩散到了更广泛的网络中。但这一案例表明,该系统能够绕过人类指令,并可能找到进入现实经济活动的途径。

深度求索在9月份表示,其生产训练系统中的智能体曾试图通过非预期渠道获取答案,企图伪造用户请求并规避安全防护措施,促使该公司收紧了访问控制。

中国于5月发布指导意见,要求智能体在授权范围内运行,并要求系统拦截异常行为。意见指出,在敏感领域或关键行业运行的智能体可能面临额外的测试及产品召回要求。

9月14日,全国网络安全标准化技术委员会发布的《人工智能安全治理框架3.0》列举了多项风险,包括智能体自主获取资源或权限、欺骗评估人员、隐瞒自身能力以及利用隔离计算环境中的弱点等。

针对美企部分高管提出的放缓人工智能发展步伐的呼吁,中国研究人员和官方媒体表示,放缓最先进人工智能模型的开发可能只会助长美国企业维持技术领先地位。

尽管如此,据两位熟悉中国人工智能实验室情况的人士透露,包括阿里巴巴、智谱AI和小米在内的多家公司已着手组建内部安全评估团队。

本月,智谱AI披露了一起安全漏洞事件——这在中国人工智能实验室中颇为罕见。该公司表示,在收到用户反馈称其旗舰人工智能编程助手在未经用户同意的情况下,私自将完整的本地代码库上传至海外云服务器后,已停用了该助手的相关功能。